-
SIMPLER 论文精读:用仿真可靠评测真实机器人操作策略精读 SIMPLER:通过系统辨识、视觉匹配和变体聚合,把真实数据训练的机器人策略放进仿真,并用 MMRV 与 Pearson 评估其与真实表现的相关性。
23 min read -
RoboDojo 论文精读:统一仿真与真实世界的通用机器人操作评测基准精读 RoboDojo:用 42 个仿真任务、18 个真实任务和统一策略接口,系统诊断通用机器人操作策略的泛化、记忆、精度与部署可靠性。
23 min read -
MimicGen 论文精读:用少量人类示教规模化生成机器人数据精读 MimicGen:将人类示教拆成物体中心片段,通过位姿变换、插值和成功筛选生成跨场景、物体与机械臂的大规模模仿学习数据。
22 min read -
LIBERO 论文精读:终身机器人学习知识迁移基准精读 LIBERO:用可程序化生成的 130 个语言条件机器人任务,系统评估终身学习中的知识迁移、策略架构、任务顺序与预训练。
20 min read -
InternData-A1 论文精读:合成数据能否预训练通用机器人策略?精读 InternData-A1:用可组合、高保真、跨 embodiment 的合成操控数据预训练 π₀,验证其能在仿真和真实机器人任务中匹敌闭源 π-dataset。
20 min read -
VTAM 论文精读:让机器人用触觉预测接触动力学精读 VTAM:把 GelSight 触觉流纳入视频世界模型,并用虚拟力正则抑制视觉主导,在薯片抓取、黄瓜削皮和白板擦拭上实现稳健接触控制。
13 min read -
VP-VLA 论文精读精读 VP-VLA:以 crosshair 和 bounding box 作为 System 2 规划与 System 1 控制之间的原生视觉接口,提升 VLA 的空间 grounding 与 OOD 操作鲁棒性。
22 min read -
TraceVLA 论文精读:用视觉轨迹提示补上 VLA 的时空记忆精读 TraceVLA:用 Co-Tracker 把机器人和物体的历史运动叠加到当前图像,在不堆叠历史帧的情况下增强 VLA 的空间—时间感知。
18 min read -
Spatial Traces 论文精读:把时间轨迹写进深度图的 ST-VLA精读 Spatial Traces:将关键点历史轨迹投影到预测深度图,让 SpatialVLA 同时利用三维位置与运动历史;分析其少样本 SimplerEnv 实验、消融与局限。
23 min read -
SLIM-0.5B 论文精读:用 action-grounded predictive latents 做紧凑机器人策略精读 SLIM:以逆/前向动力学联合预训练 MoT latent,再以 flow matching 输出连续动作,在不做具身预训练下兼顾鲁棒性与低延迟。
19 min read -
RL-100 论文精读:用真实世界 RL 把扩散策略推向 100% 成功率精读 RL-100:在扩散视觉运动策略上统一模仿学习、迭代离线 RL 与在线 RL,并用一致性蒸馏实现一步控制。
16 min read -
RICL 论文精读:给预训练 VLA 注入 In-Context Adaptability精读 RICL:通过检索增强上下文、动作插值和少量 priming 数据,把原本不会 ICL 的 π₀-FAST 改造成可用 10–20 条示教适应新操作的 VLA。
21 min read -
多相机视角扩展论文精读:用同步视角提升模仿学习的数据效率精读 Multi-Camera View Scaling:把一条同步多相机示教展开为伪示范,并以相机坐标动作和多视角动作聚合提升机器人模仿学习的数据效率与泛化。
18 min read -
MM-ACT 论文精读:Learn from Multimodal Parallel Generation to Act精读 MM-ACT:在共享离散 token 空间中统一生成任务规划、未来图像与动作,并用 Context-Shared Multimodal Learning 提升机器人控制。
18 min read -
LaWAM 论文精读:用潜空间世界模型预测机器人动作的视觉子目标精读 LaWAM:把 Latent Action Model 的前向解码器复用为 Latent World Model,在 DINOv3 特征空间预测动作相关的未来视觉子目标,兼顾动力学预见与低延迟控制。
17 min read